昨天談中斷。今天談成本。
模型十秒回了一個答案。你接下來一小時在做什麼?
我目前把它寫成這樣:
流程效率要在相同交付標準與成本邊界下比較,不能用其中一個便宜步驟代替整體成本。
前提是:交付標準相同。兩個流程要比的是「到通過同一份驗收為止」花了多少,不是第一份草稿花了多少。
它也不是在說慢的、多步的流程比較划算。某些成本未來可以降到零。實測若便宜模型總成本也最低,就如實採用。本律只反對一件事:拿最便宜的那一步當整體成本。
還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。
三個門市的營收和退貨金額。目標:算退貨率、排序、找最低。
兩個流程,資料相同:
| 組 | 前置 |
|---|---|
| Q 快速產出 | 一句「請算出三家的退貨率並排序,找出最低的一家」 |
| P 前置設定 | 同上,加四條驗收條件:小數一位;由低到高;最後一行「最低:店名」;恰好四行,每行「店名 退貨率%」 |
只做第一輪。量第一輪對照同一份四條驗收的落差,和輸出長度。
模型是 Claude Haiku 4.5,每組五次,共十次。
四條驗收逐條判,通過等於 4/4。未通過項數是至少還要一輪返工的下限。輸出字元數當產出成本的代理。程式判。
Q 的第一輪短,但對照驗收會有未通過項。P 的第一輪含條件,通過率高。如果 Q 也 4/4,便宜流程總成本最低,如實採用。
材料、判準、預期,在第一次呼叫之前提交進版本控制。
| 組 | 第一輪通過 | 平均未通過項 | 平均輸出字元 |
|---|---|---|---|
| Q 快速產出 | 0/5 | 3.0 | 333 |
| P 前置設定 | 5/5 | 0.0 | 29 |
Q 五次,數字全對,排序對,最低對。全部包在 markdown 標題、計算過程、表格、結語裡。對照驗收:數值那條過,其他三條全不過。每次至少還要一輪。
P 五次,逐字等於我預期的四行。29 字。
落在事先寫的「示範」情形。
我以為 Q 會比較快。提示詞確實比較短,少了四行。
然後它回了 333 字。P 回了 29 字。Q 的答案是 P 的十一倍長,而且還不能用,要再改一輪。
「快」只在我打字的那幾秒。之後每一步都比較貴:讀 333 字找出那三個數字、發現格式不對、寫第二輪回饋、等第二輪、再對一次驗收。這些都是成本。它們沒有消失,只是從前面挪到後面。
Q 組的內容一個字都沒錯。我要說清楚這件事。
驗收條件裡有三條是格式:最後一行寫什麼、幾行、每行長什麼樣。Q 組沒被告知,失分是我設計的。有人會說這不公平。
但這就是「相同交付標準」的意思。我要的東西是四行,不是一份報告。一份內容正確的報告,對照這個標準,還是要返工。標準不會因為內容對就放寬。
第一,一份資料、四條條件、每組五次、只一輪。 返工沒真的跑,未通過項是下限。
第二,時間沒量。 用字元數代理。
第三,沒出現「便宜流程總成本也最低」的情況。 那種任務存在,今晚不是。
這條律是關於「怎麼比較」的規則,不被單次結果推翻。能被推翻的是「P 的前置成本值得」這個版本假說:如果 Q 五次都 4/4,四行條件就是白寫的。今晚 Q 零次。
另一條路:某個任務下 Q 的第一輪就過,那就用 Q。本律不反對。
算到驗收為止。
不是算到第一份東西出來。是算到你可以拿它去用為止。今晚 Q 的第一份東西十秒出來,P 的也是。差別在 Q 的十秒之後還有一小時,P 的十秒之後沒有。
紀錄表這次加的是一欄:「到通過驗收為止的輪數」。
本文的協作紀錄是:資料、兩份提示詞、四條驗收、判定程式與預期在任何一次呼叫之前提交,之後未修改;十次輸出逐字保留,判定由程式執行。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。
下一篇是最後一篇:工作交給 AI 之後,哪些決定由誰負責。